AI自己出题自己练!两个月狂涨11%,编码自测反超Opus 4.8
AI自己出题自己练!两个月狂涨11%,编码自测反超Opus 4.8Ornith-1.5采用模型自出题、自搭脚手架、自跑轨迹的三段式强化学习闭环,在Terminal-Bench 2.1自测中以86.1分超过其自测的Claude Opus 4.8(85.0分),较两个月前的1.0版本提升约11%。
搜索
Ornith-1.5采用模型自出题、自搭脚手架、自跑轨迹的三段式强化学习闭环,在Terminal-Bench 2.1自测中以86.1分超过其自测的Claude Opus 4.8(85.0分),较两个月前的1.0版本提升约11%。
在此背景下,新加坡国立大学、普林斯顿大学与斯坦福、牛津等研究团队合作提出了 Recuris(Recursive Experiential–Working Memory Evolution),作为首个将递归自我改进应用在记忆控制层内的智能体架构,Recuris 通过三项核心技术突破,无需训练即成功实现了从 3B 小模型到 Claude Opus 5 的全面提升。
今天,又有消息曝出:全新Opus 5.1模型,据传将在本周突袭发布。 从此,智能体赛道又要大洗牌了。 它有碾压级的编程能力、复杂的逻辑推理和长时间运行的AI Agent能力。单Token的智能水平,将再次被推到极限!
由华东师大智金院团队孵化的金融原生 Agentic Foundation Model 家族 Mint-Agent 正式发布。在 FinanceAgentBench v2 上,27B 的 Mint-Ag 达到 60.49%,超过 GPT-5.6-Sol 与 Claude Opus 4.8;单题推理成本分别仅为两者的约 22% 和 10%。
Claude Opus 4.6的轻量平替,只需要 27B 参数,你信吗?最近发布的Qwen3.8-27B,就顶着这样的评价火遍了开源社区。上线两天,下载量突破100万次,登顶Hugging Face全球大模型趋势榜。
2026 年 1 月,Floatboat 客户端把文件管理器、编辑器和浏览器直接做成 Agent 的运行环境,开创了 Agent 桌面工作台这一形态;4 月,FloatIM 把人与 Agent、Agent 与 Agent 接成一张办公网络,任务可以跨人、跨 Agent 交接而上下文不断;5 月,FloatSchedule 让 Agent 不必等人下指令,按日程自己开工。
且不论性能,自Claude Opus 5发布以后有一件事让AI圈特别在意,就是Anthropic在提示词上的改进。
整个AI圈,都在为Opus 5沸腾!
7 月 24 日,Claude Opus 5 上线。几个小时之内,我看到各家媒体把这个模型的评测成绩转载了一轮,而更值得留意的是 Anthropic 内部人员当天发出的一条推文。
Anthropic又被扒光了!这一次,Claude Opus 5的系统提示词,被人整份扒下来,传到GitHub上了。旗舰刚发,就被全网「开盒」,这一波属实猝不及防。就在上线的同一天,开发者Eversmile1直接建了个新仓库。